آموزش web Scraping با python
در دوره آموزش Web Scraping با Python، با اصول و تکنیکهای جمعآوری خودکار اطلاعات از وب آشنا میشوید. ابتدا مفاهیم پایه Web Scraping و ساختار صفحات وب را یاد میگیرید و سپس با کتابخانههای قدرتمند Python مانند Requests و BeautifulSoup کار میکنید. در ادامه دوره، نحوه ارسال درخواستهای HTTP، استخراج اطلاعات از HTML، کار با لینکها و جداول، پردازش و پاکسازی دادهها و ذخیره اطلاعات در فایلها و دیتابیس را بهصورت عملی یاد خواهید گرفت. همچنین با روشهای پیشرفتهتر مانند مدیریت صفحات دارای محتوای پویا، کار با Selenium و نکات مهم مربوط به محدودیتها، سرعت درخواستها و رعایت قوانین وبسایتها آشنا میشوید. در پایان دوره میتوانید اسکریپرهای کاربردی با Python طراحی کنید و دادههای موردنیاز خود را بهصورت خودکار جمعآوری و پردازش کنید.
سرفصل جلسات دوره
10 جلسهWeb Scraping چیست؟ کاربردهای Web Scraping تفاوت Web Scraping و Web Crawling ساختار صفحات وب و HTML آشنایی با HTTP و Request/Response آمادهسازی محیط Python نصب کتابخانههای موردنیاز
معرفی کتابخانه Requests ارسال GET و POST Request کار با Response بررسی Status Code ارسال Header و User-Agent کار با Query Parameters مدیریت خطاهای HTTP
معرفی BeautifulSoup تبدیل HTML به ساختار قابل پردازش پیدا کردن تگها و عناصر HTML استفاده از find و find_all استخراج متن و Attributeها کار با CSS Selector استخراج لینکها و تصاویر
طراحی ساختار Scraper استخراج اطلاعات چندین صفحه کار با Pagination دنبال کردن لینکها ذخیره دادههای استخراجشده مدیریت Exceptionها ایجاد ساختار قابل توسعه برای پروژه
تمیز کردن دادههای متنی حذف دادههای اضافی تبدیل فرمت دادهها کار با تاریخ و اعداد حذف دادههای تکراری اعتبارسنجی دادههای استخراجشده آمادهسازی داده برای ذخیرهسازی
ذخیره اطلاعات در CSV کار با JSON ذخیره داده در Excel معرفی SQLite ذخیره اطلاعات در دیتابیس طراحی جدول برای دادههای استخراجشده مدیریت دادههای تکراری
تفاوت صفحات Static و Dynamic آشنایی با JavaScript در صفحات وب بررسی Network و درخواستهای سایت استخراج اطلاعات از APIهای سایت معرفی Selenium نصب و راهاندازی Selenium کنترل مرورگر با Python
باز کردن صفحات با Selenium پیدا کردن Elementها کلیک و ارسال اطلاعات به فرمها اسکرول خودکار صفحات کار با صفحات چندمرحلهای انتظار برای بارگذاری عناصر استخراج اطلاعات از صفحات تعاملی
تحلیل سایت و شناسایی دادههای موردنیاز طراحی ساختار پروژه استخراج اطلاعات محصولات پیادهسازی Pagination پاکسازی دادهها ذخیره اطلاعات در دیتابیس مدیریت خطا و اجرای خودکار Scraper
مدیریت Requestها و Session Proxy و مدیریت IP در حد نیاز پروژه محدود کردن سرعت درخواستها Retry و مدیریت قطعیها رعایت Robots.txt و شرایط استفاده سایت جلوگیری از ایجاد بار غیرضروری روی سرور زمانبندی اجرای Scraper بهینهسازی و جمعبندی پروژه